Skip to main content
OpenCLIP provides a comprehensive collection of pretrained CLIP models trained on various datasets at different scales.

Listing Available Models

List All Pretrained Models

List Model Architectures

Query Specific Models

Model Zoo Overview

Vision Transformer (ViT) Models

ViT models provide excellent accuracy-efficiency tradeoffs:

ResNet Models

Classic CNN-based architectures:

ConvNeXt Models

Modern CNN architectures with competitive performance:

SigLIP Models

Models trained with SigLIP loss function:

EVA Models

State-of-the-art EVA-CLIP models:

Training Dataset Information

OpenAI WIT

  • Dataset: WebImageText (WIT) - 400M image-text pairs
  • Models: Original OpenAI CLIP models
  • Tags: openai

LAION Datasets

  • LAION-400M: 400M English image-text pairs
  • LAION-2B: 2B English image-text pairs
  • LAION-5B: 5B multilingual image-text pairs
  • Tags: laion400m_*, laion2b_*, laion5b_*

DataComp

  • DataComp-XL: 1.4B filtered image-text pairs
  • DataComp-L: 1.0B pairs
  • DataComp-M: 128M pairs
  • DataComp-S: 13M pairs
  • Tags: datacomp_xl_*, datacomp_l_*, datacomp_m_*, datacomp_s_*

WebLI (SigLIP)

  • Dataset: Google’s WebLI dataset
  • Models: SigLIP models with sigmoid loss
  • Tags: webli

Model Selection Guide

Fastest inference:
  • ViT-B-32: Best speed/accuracy tradeoff
  • RN50: Classic CNN option
  • MobileCLIP-S1: Ultra-fast mobile deployment

Loading from HuggingFace Hub

Many models are available on HuggingFace Hub:
  • laion/CLIP-ViT-L-14-DataComp.XL-s13B-b90K
  • laion/CLIP-ViT-H-14-laion2B-s32B-b79K
  • laion/CLIP-ViT-bigG-14-laion2B-39B-b160k
  • apple/DFN5B-CLIP-ViT-H-14
  • timm/ViT-SO400M-14-SigLIP-384
HuggingFace models automatically download config and weights. The hf-hub: prefix explicitly specifies HuggingFace as the source.

Multilingual Models

Models trained on multilingual datasets:
Available multilingual models:
  • xlm-roberta-base-ViT-B-32
  • xlm-roberta-large-ViT-H-14
  • ViT-B-16-SigLIP-i18n-256 (SigLIP multilingual)

Specialized Models

CoCa (Captioning)

Models with generative capabilities:

DFN Models

Apple’s Distilled Feature Networks:

Performance Metrics

For detailed zero-shot performance across 38 datasets, see the full results CSV.

Benchmark Datasets

  • ImageNet: Primary zero-shot benchmark
  • ImageNet variants: -A, -R, -Sketch, -V2
  • Object recognition: CIFAR-10/100, STL-10, Food101
  • Fine-grained: Flowers102, Pets, Cars, Aircraft
  • Scene: SUN397, Places365
  • Action: UCF101, Kinetics700

Example: Finding Best Model